GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录
GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。
来自主题: AI资讯
9142 点击 2026-09-19 10:58
搜索
OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。
一开始,忽悠 AI 挺简单。
日常聊天可能在不经意间污染个性化Agent的长期记忆,使其在未来任务中偏离用户真实意图。研究人员通过ULSPB基准测试发现,即使无恶意提示,日常对话也可能改变Agent的安全边界。